Meta推出首个实时音频感知模型Muse Voice Transcribe,可通过Model API调用,定价每1000分钟3美元(约每小时0.18美元)。该模型整合流式语音识别、说话人分离与端点检测,支持边说边转写,无需等待整段音频,并可自动区分20余名说话者分轨输出。
Moonshot
$200
输入tokens/百万
输出tokens/百万
131
上下文长度
NijiVoice-MCP是一个开发中的项目,实现了与にじボイス(Niji Voice)API的Model Context Protocol (MCP)集成,使LLM能够通过MCP接口轻松调用にじボイ斯的语音合成功能,包括语音生成、声优列表获取和余额查询等。